AI资讯新闻榜单内容搜索-KV cache

AITNT-国内领先的一站式人工智能新闻资讯网站
# 热门搜索 #
搜索: KV cache
字节找到了DeepSeek时强时弱的原因

字节找到了DeepSeek时强时弱的原因

字节找到了DeepSeek时强时弱的原因

DeepSeek的神鬼二象性被字节Seed团队逮到了。

来自主题: AI资讯
9997 点击    2026-10-09 16:23
量化后画面闪烁?时序稳定的视频世界模型2-bit KV Cache压缩方案诞生

量化后画面闪烁?时序稳定的视频世界模型2-bit KV Cache压缩方案诞生

量化后画面闪烁?时序稳定的视频世界模型2-bit KV Cache压缩方案诞生

哈尔滨工业大学(深圳)iLearn-Lab与新加坡国立大学LV-Lab提出免训练2-bit KV Cache量化框架QuantWM,改善视频世界模型量化后的时序闪烁与画质,并实现最高6.20倍缓存压缩。

来自主题: AI技术研报
8472 点击    2026-10-07 15:18
KV Cache不用「精挑细选」?随机删除媲美最强基线,推理吞吐最高再提43%

KV Cache不用「精挑细选」?随机删除媲美最强基线,推理吞吐最高再提43%

KV Cache不用「精挑细选」?随机删除媲美最强基线,推理吞吐最高再提43%

大模型越来越会 “想”,也越来越能把 GPU 显存 “想满”。 在数学、科学问答和代码生成等任务中,reasoning model 往往会生成数千乃至数万 token 的长推理链。随着生成持续进行,每

来自主题: AI技术研报
9037 点击    2026-09-20 11:05
把记忆交给CPU,大模型会变快

把记忆交给CPU,大模型会变快

把记忆交给CPU,大模型会变快

拿Agent做Coding,想必大家都已经很熟悉了。

来自主题: AI资讯
10559 点击    2026-09-16 14:40
日均产出万亿Token!Mooncake落地生产,KV Cache命中率稳定突破90%

日均产出万亿Token!Mooncake落地生产,KV Cache命中率稳定突破90%

日均产出万亿Token!Mooncake落地生产,KV Cache命中率稳定突破90%

趋境科技通过部署SGLang HiCache+Mooncake Store,将KV Cache从单机资源升级为集群级共享池化资源,支撑其日均产出超万亿Token的生产实践,KV Cache命中率稳定突破90%,并在生产环境中持续优化大规模推理集群的性能与稳定性。

来自主题: AI技术研报
8469 点击    2026-09-11 15:57
北大联合阶跃星辰提出TensorCast:统一可编程管理大模型张量,推理「首字延迟」最高降低93.2%

北大联合阶跃星辰提出TensorCast:统一可编程管理大模型张量,推理「首字延迟」最高降低93.2%

北大联合阶跃星辰提出TensorCast:统一可编程管理大模型张量,推理「首字延迟」最高降低93.2%

过去几年,大模型推理系统优化的核心目标一直围绕一个问题展开:如何让 GPU 更高效地计算权重、激活、KV Cache 等高维张量?从并行策略、请求调度、显存管理到算子优化,学界业界大量优化技术不断提升模型推理效率。

来自主题: AI技术研报
10252 点击    2026-08-17 15:18
超越TurboQuant:Together AI把2-bit KV Cache推向真实服务

超越TurboQuant:Together AI把2-bit KV Cache推向真实服务

超越TurboQuant:Together AI把2-bit KV Cache推向真实服务

长上下文模型越来越能“记”,但真正让它们跑到线上时,最先顶不住的往往不是算力,而是KV Cache。

来自主题: AI技术研报
6427 点击    2026-06-05 09:53
Claude Code 每条请求暗藏一行「有毒」header,52K 上下文推理被拖慢 5 倍!NVIDIA 一个 flag 修好了

Claude Code 每条请求暗藏一行「有毒」header,52K 上下文推理被拖慢 5 倍!NVIDIA 一个 flag 修好了

Claude Code 每条请求暗藏一行「有毒」header,52K 上下文推理被拖慢 5 倍!NVIDIA 一个 flag 修好了

NVIDIA Dynamo 团队发现,Claude Code 向自定义端点发送请求时,prompt 最前面会带一行 session-specific billing header。这行 header 每个 session 都变,导致 52K token 的稳定前缀在 KV cache 中无法复用——TTFT 从 168ms 飙到 912ms。Dynamo 加了一个 `

来自主题: AI资讯
13239 点击    2026-05-11 11:01
对抗KV Cache压缩的脆弱性:两行代码以最坏风险控制防御底层假设崩塌

对抗KV Cache压缩的脆弱性:两行代码以最坏风险控制防御底层假设崩塌

对抗KV Cache压缩的脆弱性:两行代码以最坏风险控制防御底层假设崩塌

随着大模型长上下文能力快速增长,海量 KV Cache 存储需求急剧增加,各类 KV Cache 压缩方法如雨后春笋般涌现。然而,这些方案在真实场景中的工程落地却常常陷入困境。

来自主题: AI技术研报
9922 点击    2026-03-25 13:41